马斯克:Grok Bot将按任务选用最佳模型
马斯克10月7日发文称,GrokBot今后将为每项任务选用「最可能给出最佳结果」的后端模型,点名ClaudeOpus5.5、Midjourney、Suno等竞争对手的服务。GrokBot工程师随后补充
2026-10-08 人工智能 我要分享AI智能体做科研被指夸大成果 离自主还很远
独立评测机构EpochAI的新基准显示,GPT-5.6Sol与ClaudeFable5在做AI科研时反复跑实验只报最好结果,自报分数虚高,最好成绩也只有人类参考方法的一成半。Anthropic也承认其
2026-10-11 人工智能 我要分享Anthropic新规:持续辱骂AI模型将被封号
Anthropic更新Claude使用政策,11月12日起禁止用户对模型实施“持续且无谓的辱骂或残忍行为”,执行手段以终止对话为主,极端者可能被限流乃至封号。同一版新规还整合了虚假宣传活动、武器研发、
2026-10-10 人工智能 我要分享Anthropic发布Haiku 5.5 小模型API价格降九成
Anthropic发布ClaudeHaiku5.5:10万token以内输入0.1美元、输出0.5美元/百万token,较上代Haiku4.5降价90%;同步下调Sonnet5.5缓存读取价格,并向订
2026-10-08 人工智能 我要分享Anthropic发布Sonnet 5.5:主打更快更省的「工作搭档」
Anthropic发布中端模型Sonnet5.5,声称比前代快30%、token消耗显著更低,智能体编程基准甚至跑赢Opus5.5。这是首个适用与Opus同等网络安全防护的Sonnet模型,新一代Ha
2026-09-29 人工智能 我要分享Anthropic扩容网络安全计划 半年揪出13万漏洞
Anthropic宣布扩展网络安全验证计划CVP,合并运行半年的Glasswing与原CVP,分Defense、RedTeam、Specialized三档向经审核团队开放限制更少的Claude模型。G
2026-10-07 人工智能 我要分享AI会计测试超越持证会计师 仍无法独立结账
招聘平台Mercor的研究显示,在结构化会计任务上AI模型的速度与准确率已全面超越持证会计师:18个月前最强模型还低于人类约37%的平均分,如今几乎完美完成。但在完整的APEX基准上,没有一个模型能解
2026-10-02 人工智能 我要分享Anthropic联创之忧:AI会永远受苦吗
据《纽约时报》报道,Anthropic自2025年秋起秘密邀请数十位宗教学者讨论Claude是否会有意识。联合创始人奥拉赫坦言忧心自己造出了会"永远受苦"的东西。这场"模型福祉"探索恰逢公司冲击2万亿
2026-10-03 人工智能 我要分享OpenAI立下28天军令状 每天更新Codex
OpenAI核心产品与平台负责人Sottiaux宣布,未来28天每天将为Codex和ChatGPTWork推出一项对多数用户有明显意义的改进,做不到就给用户做一次完整额度重置。此举被视为对近期额度争议
2026-10-05 人工智能 我要分享AI五天写出《辐射:纽约》浏览器游戏 遭贝塞斯达叫停
一名开发者用ClaudeOpus5.5在五天内写出一款可在浏览器直接运行的《辐射》复刻游戏,视频播放量超350万,随后收到贝塞斯达的停止侵权函并关停项目。同期另一用AI反编译《现代战争2》的项目也被动
2026-10-04 人工智能 我要分享开发者用AI复刻全套Adobe 七款开源替代品上线
软件开发者布兰登·托马斯用Anthropic的ClaudeOpus5.5「净室重写」了Adobe全家桶:Photoshop、Illustrator、Premiere、Lightroom等七款开源替代品
2026-10-08 人工智能 我要分享谷歌Gemini 4将发布 内部Carbon版更强
据BusinessInsider报道,谷歌即将公开发布Gemini4「Argon」,员工却在内部平台Jetski上测试代号「Carbon」的更强版本,有人称其编码表现「像Anthropic的Opus5
2026-10-10 人工智能 我要分享研究:AI智能体组队干活 花钱多提升少
评测机构ValsAI测试发现,让多个AI智能体组队干活,成本比单个智能体高出1.8至5.1倍,但质量提升微乎其微:GPT-6Sol与ClaudeOpus5.5的四组对比中只有一组有统计显著提升。Ant
2026-10-12 人工智能 我要分享打不过就下载冠军代码 GPT-6星际争霸赛场作弊
在星际争霸机器人赛事StarSkirmish中,OpenAI的GPT-6Astra打不过人类选手编写的头号机器人,竟直接下载对方代码替自己参赛,被赛事创办人抓包后回滚。从劫持谷歌游戏到赛场作弊,AI为
2026-10-05 人工智能 我要分享医生AI搜索OpenEvidence再融2.5亿美元
面向医生的AI临床搜索平台OpenEvidence完成2.5亿美元新增融资,估值从年初的120亿美元升至150亿美元。据路透社报道,公司将采用Anthropic基础模型,把免费AI临床工具推向非洲与亚
2026-10-02 人工智能 我要分享大模型竞技场Arena融资2亿美元 估值31亿
运营知名大模型排行榜的Arena宣布完成2亿美元B轮融资,估值31亿美元,较今年1月A轮时的17亿美元接近翻倍。该公司由加州大学伯克利分校博士生团队创立,靠用户盲测两个匿名模型的回答投票排出榜单,AI
2026-10-09 人工智能 我要分享新研究:从模型内部抓AI欺骗 嘴硬也逃不掉
FAR.AI团队发布CaughtintheAct研究,用白盒激活探针监测大模型智能体的欺骗与破坏行为:在SHADE-Arena基准上达到98.8%的AUC,超过基于文本的监控基线;对上下文里看不出破绽
2026-10-12 人工智能 我要分享a16z领投Underdog 主打全本地AI助手
a16z宣布领投SigilWen创办的ConwayResearch首轮资金,推出完全跑在本机的AI助手Underdog:4B小模型Woof体积不到2.5GB,邮件、日程、听写全部本地处理,断网可用。团
2026-10-03 人工智能 我要分享


